Dans ce module, nous allons étudier comment utiliser l'approximation de fonctions dans le domaine de l'apprentissage par renforcement. L'objectif est d'estimer les fonctions des valeurs des états à partir de données issues de l'application des stratégies de type On-policy. Le but est donc d'estimer $V_\pi$ depuis des expériences générées par une stratégie $\pi$.
Ce qui est nouveau ici c'est que les approximations des fonctions des valeurs ne sont plus représentées par des tables mais par des fonctions paramétrées par un vecteur de poids $\textbf{w}\in \mathbb{R}{^d}$. Nous écrirons ainsi $\hat v\left( {s,\textbf{w}} \right) \approx {V_\pi }\left( s \right)$ pour définir la valeur approximée de l'état $s$, avec comme poids utilisés $\textbf{w}$. Par exemple, ${\hat v}$ peut-être une combinaison linéaire de paramètres de l'état, avec $\textbf{w}$ contenant les coefficients de la combinaison linéaire de ces paramètres :
$$\hat v\left( {s,w} \right) = \sum\limits_i {{w_i}f\left( s \right)}$$De manière plus générale, ${\hat v}$ peut-être une fonction non linéaire calculée à partir d'un réseau neurones artificiels multi-couches où $\textbf{w}$ représente les poids utilisés pour relier les couches du réseau. En ajustant les poids, n'importe quelle fonction peut-être approximée par le réseau :

Une autre possibilité est par exemple d'estimer la fonction $\hat v$ avec un arbre de décision où les poids $\textbf{w}$ seraient toutes les valeurs définissant les séparations entre les feuillages. Typiquement, le nombre de poids (c'est-à-dire la dimension de $\textbf{w}$) est très inférieur au nombre d'états : $d \ll \left| s \right|$, et le fait de modifier la valeur d'un poids engendre des modifications sur l'estimation de tous les états. En conséquence, lorsqu'un seul état mis à jour, ce changement est généralisé à l'ensemble des états. Ce concept de généralisation fait que l'apprentissage peut potentiellement être plus puissant mais d'un autre côté plus difficile à gérer.
Le fait d'utiliser des approximations de fonctions pour l'apprentissage par renforcement permet également de traiter des problèmes ou les états ne sont pas complètement observables par l'agent. On peut en effet imaginer des fonctions ${\hat v}$ qui approximent les valeurs des états mais qui ne sont pas paramétrées par certaines caractéristiques des états de l'environnement. On parle alors d'observabilité partielle.